Multi-Head Attention
概述
一种扩展的注意力机制,将查询、键和值分别投影到多个不同的子空间中,在每个子空间独立执行注意力计算,最后将结果拼接起来,增强了模型的表达能力。
关键内容
- 计算过程:
- 将 Q、K、V 分别投影到 h 个不同的低维子空间
- 在每个子空间独立执行注意力计算:head_i = Attention(Q W_i^Q, K W_i^K, V W_i^V)
-
拼接多头输出:Concat(head_1, ..., head_h) W^O
-
技术参数:
- 论文中使用 h = 8 个注意力头
- 每个头的维度为 d_k = d_v = d_model / h = 64
-
保持总体计算成本与单头相近
-
优势特点:
- 能够在多个表示子空间中学习不同的注意力模式
- 不同的头可以关注不同类型的关系(语法、语义、位置等)
- 显著增强了模型的表达能力
来源
- Transformer — 核心组件
- 20-vaswani-transformer.md — raw/books/计算机科学/20-vaswani-transformer.md
相关
- Transformer — core_component
- Attention Is All You Need — introduced_in
- Self-Attention — variant
- Scaled Dot-Product Attention — component